ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
搜索
7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
这将是一个充满生产力的周末。就在刚刚,Claude 宣布当时时间 7 月 20 日起,Fable 5 继续留在所有 Max 和 Team Premium 套餐里,限额 50%。Pro 和 Team Standard 用户继续用积分访问,另外给用户发 100 美元的一次性积分。
外媒Axios称,K3定价远低于它所挑战的高端模型,美国AI公司的高价策略还能维持多久?巧的是,就在最近,两大巨头正在打客户争夺战。此前,特曼在X上发帖,不提新模型,开头就是一句认错:
今天凌晨看到 Arena AI 更新 Code Arena 榜单时,我第一反应是有点意外。刚刚发布的 Kimi K3 拿到了 1679 分,排在全球第一,压过了 Claude Fable 5 的 1631 分和 GPT-5.6 Sol 的 1618 分。
最近两周,因为Claude Fable 5回归、GPT-5.6上线再加上Tibo义父疯狂的重置。
这两天网上冲浪的时候,发现有人用 Claude 复刻了一个类似《魔兽世界》的在线多人游戏。
科学研究正在迎来一个新的阶段。
卷起来了!
Fable 5 在远程劳动力指数(Remote Labor Index,RLI)上拿到了 16.1% 的自动化率,几乎是第二名 Opus 4.8(8.3%)的两倍,更是第三名 GPT-5.5(6.3%)的 2.5 倍。
最近发现了一个很便宜的平替方案,是在X上刷到的一个很有意思的开源项目:OpenSquilla 0.5.0(在Github 已经有5.5K Star)当时我还发了一篇推文。它揭示了一个非常反常识的事:一组便宜的国产模型以一定的方式组合起来,居然可以在公开评测上打赢国外更强的旗舰模型们(Claude Fable 5、Opus4.8、GPT-5.5)